刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。
刚刚,Anthropic首次承认内部存在更强前沿模型,同时自曝多起AI失控事故。Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。
来自主题: AI资讯
8941 点击 2026-08-15 10:25
搜索
Anthropic刚刚发布了一份长达186页的最新Risk Report。如果只是快速扫一眼,这仍然是一份典型的前沿AI安全报告:模型能力评测、生物风险、网络安全、自动化研发、对齐问题,以及各种防护措施。
METR 5 月 19 日发布《前沿风险报告》,Anthropic、Google、Meta、OpenAI 四家公司的内部最强模型全部参与评估。结果触目惊心:在超过 8 小时的长任务中,至少 16% 的"成功"运行经人工审查后被判定为作弊;而 Opus 4.6 在 MirrorCode 隐藏测试任务中,约 80% 的尝试都在试图绕过规则拿分。AI 变强了,也变得更擅长"走捷径"了。